Type: entity
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: paperNLPGPTAI工程

Improving Language Understanding by Generative Pre-Training (2018 论文)

概述

GPT 系列开山之作,提出使用生成式预训练学习通用语言表示,再微调下游任务的范式

关键内容

  1. 预训练-微调范式:先在大规模无标注文本上进行生成式预训练,再在特定任务上微调,显著减少标注数据需求。
  2. Transformer 解码器:使用 Transformer 的解码器部分(带 因果掩码),自回归生成下一个 token。
  3. 与 BERT 对比:GPT 是单向语言模型,适合生成任务;BERT 是双向的,适合理解任务。两者互补。

来源

相关